Skip to content

Deep learning four decades of human migration

Gaskin, Abel (2026)

DisciplineInterdisciplinary
MethodComputational
Tagsbilateral flowsdata · digital trace datadata · secondary survey analysisdeep learningdemographymethod · embeddingmethod · machine learningmigrationuncertainty quantification

Summary

Problem: 全球移民数据长期存在稀疏性、高收入国家偏向、定义不一致和时间分辨率低等问题。现有数据主要依赖联合国和世界银行每五年或十年发布一次的移民存量数据,无法捕捉年度动态变化;而年度流量数据仅在高收入西方国家可得,且各国对“移民”的定义差异巨大,导致全球移民研究存在严重的接收国偏向。 Approach: 作者构建了一个深度循环神经网络集成模型,结合地理、经济、文化和政治协变量,训练目标包括联合国DESA移民存量数据、Facebook数字痕迹数据以及少量欧洲双边流量和净移民数据。模型通过损失函数迭代最小化来学习从协变量到移民流量的映射,并通过集成和不确定性传播生成置信区间。 Finding: 模型生成了1990–2023年全球230个国家和地区的年度双边移民流量数据集。结果显示全球移民流量从2000年的1300万增至2023年的约3500万;模型在保留数据上达到73%的相关性,优于现有五年期估计;同时揭示了中东劳工移民、撒哈拉以南非洲冲突迁移等此前被掩盖的动态,并修正了联合国净移民估计中的若干偏差。 Significance: 该数据集首次提供了全球覆盖、年度分辨率的移民流量估计,使研究者能够将移民模式与年度经济、冲突、气候和政策数据整合,支持因果分析和比较研究,并为人口预测模型提供输入。同时,不确定性量化有助于识别数据最匮乏、最需要改进收集的地区。

Theoretical Framework

  • Theoretical tradition: 计算社会科学与人口学交叉领域,融合了机器学习方法和人口学中的移民存量—流量估计传统。
  • Prior theories built upon: 存量差分法(stock differencing)、人口统计核算方法(demographic accounting methods)、引力模型(gravity models)、QuantMig项目的贝叶斯框架。
  • Causal mechanism: 模型通过循环神经网络的“隐藏状态”实现时间记忆机制,使过去的协变量状态能够影响当前移民流量,捕捉延迟效应和反馈回路——即移民决策不仅取决于当前经济、政治条件,还受历史条件累积影响。
  • Key assumptions: 假设协变量与移民流量之间存在可学习的非线性映射关系;假设目标数据(UN存量、Facebook数据、欧洲流量)在加权组合后能代表真实的全球移民模式;假设循环神经网络的时间记忆机制能有效替代马尔可夫假设。
  • Theoretical move: 本文挑战了传统引力模型的马尔可夫假设(即移民决策仅基于当前状态),应用了深度学习中的循环神经网络来引入系统“记忆”,扩展了机器学习在移民研究中的应用范围——从城市内部流动和国内迁移扩展到全球国际移民。
  • Scope conditions: 模型适用于1990–2023年间的全球国际移民;对数据丰富的欧洲和OECD国家估计精度较高,对撒哈拉以南非洲等数据匮乏地区不确定性较大;模型不适用于国内迁移或非国际流动。

Research Design

本研究属于计算建模研究(computational modeling study),采用深度循环神经网络集成方法。分析单元为“出生国—居住国”双边移民走廊(origin-destination corridor by country of birth),共覆盖230个国家和地区。关键自变量为各国社会经济、文化、地理和政治协变量(如GDP、人口、距离、语言、殖民历史、冲突指标等,详见Extended Data Table 1);因变量为年度双边移民流量(按出生国分类),并由此推导出年度移民存量和净移民。模型通过损失函数最小化训练,损失函数衡量预测值与目标数据(UN DESA存量、Facebook数据、欧洲流量、净移民数据)之间的不匹配程度。

Data & Sample

  • 样本规模: 230个国家和地区之间的所有双边走廊,时间跨度1990–2023年(34年)。
  • 目标数据来源: (1) UN DESA移民存量数据(五年间隔);(2) Facebook聚合匿名位置数据(2019–2022年,181国);(3) 欧洲QuantMig项目双边流量估计(2009–2019年,30国);(4) 少数国家的官方净移民数据。
  • 协变量数据: 各国地理、经济、文化和政治指标(具体来源见Extended Data Table 1)。
  • 验证数据: 包括UN WPP 2024、USCB国际数据集、INSEE、UNHCR难民数据等。
  • 数据特征: 训练数据中约20%来自欧洲或新西兰相关走廊,存在明显的地域偏向。

Analytical Strategy

  • 模型架构: 深度循环神经网络(recurrent neural network)集成,通过隐藏/潜在状态实现时间记忆机制。
  • 训练策略: 五折交叉验证——将流量走廊分为五等份,每次用四份训练、一份测试,训练五个随机初始化的网络。
  • 性能评估: 主要采用相关性指标(而非均方误差),以便在不同移民定义的数据集间进行有意义的比较;同时报告中位相对误差。
  • 不确定性量化: 通过集成网络(n=1,500样本)和将输入数据不确定性传播通过网络来生成置信区间。
  • 稳健性检验: (1) 剔除欧洲和新西兰相关数据后检验对其他区域预测的稳定性;(2) 剔除2020年后数据检验时间路径依赖性;(3) 与QuantMig不确定性比较验证不确定性估计的合理性。

Results & Findings

  • 全球移民总量上升: 全球年度移民流量从2000年的约1300万增至2023年的约3500万,人均移民率从0.2%升至0.45%,说明增长不能仅由人口增长解释。仅有的两次持续下降发生在2008–2009年大衰退和2020年COVID-19疫情期间。这一发现支持了移民与经济发展长期趋势相关的理论预期,同时揭示了短期冲击的影响。
  • 最大单年事件: 1994年卢旺达向刚果民主共和国的人口流动接近95万,是模型登记的最大单年事件,验证了模型捕捉冲突驱动移民的能力。
  • 中东劳工移民规模: 自2010年以来,印度、巴基斯坦和孟加拉国向沙特阿拉伯、卡塔尔、巴林和阿联酋的移民总计1900万(年均135万),超过同期墨西哥向美国移民总量(1990年以来1360万)。这一发现揭示了全球移民格局中发展中国家间走廊的重要性,挑战了以西方接收国为中心的叙事。
  • 欧洲内部迁移: 欧洲是区域内迁移量最高的地区,1990年以来东欧向西欧的流动总计约2000万(年均60万)。1991年苏联解体后,欧洲内部流动达202万,其中波兰、俄罗斯、乌克兰和罗马尼亚出生者占80.7万。模型准确匹配了QuantMig估计及其不确定性。
  • 撒哈拉以南非洲冲突迁移: 2013–2014年间约7.9万尼日利亚出生者迁往乍得、尼日尔和喀麦隆(其中4.5万前往尼日尔);2009–2019年总计25万(标准差3.1万)。南苏丹内战导致大量人口流入埃塞俄比亚。这些估计与UNHCR难民数据吻合,但提供了更精细的年度动态。
  • 修正联合国净移民估计: 模型显示俄罗斯净移民在2005年左右转为负值(而UN WPP估计显示1995年以来一直为正),直到2022年乌克兰人流离失所才逆转。越南的净移民在WPP中出现的2008年异常峰值被模型修正为更平滑的趋势。模型与WPP在OECD国家高度相关,但在非洲和中亚部分地区相关性较弱。
  • 不确定性区域差异: 撒哈拉以南非洲的净移民估计不确定性全球最高,而欧洲和其他富裕西方国家不确定性较低。这一发现强调了改善数据匮乏地区数据收集的紧迫性。
  • 验证结果: 模型在训练数据上达到94%相关性,在测试数据上达到73%相关性,中位相对误差仅增加4%。剔除欧洲和新西兰数据后其他区域预测保持稳定,表明模型未将高收入地区特有动态转移到全球其他地区。

Limitations

  • 模型对撒哈拉以南非洲等数据匮乏地区的估计不确定性较高,这些地区的估计应谨慎解读。
  • 训练数据中约20%来自欧洲或新西兰相关走廊,尽管稳健性检验表明模型未过度依赖这些数据,但数据分布不均仍可能影响某些区域的估计精度。
  • 目标数据本身存在定义不一致问题(如各国对“移民”的不同定义),模型虽通过相关性指标部分缓解了这一问题,但无法完全消除。
  • 模型依赖协变量的质量和覆盖范围,某些国家的协变量数据可能不完整或过时。
  • 数字痕迹数据(Facebook)仅覆盖2019–2022年,且存在平台使用偏差,虽经加权校正但仍有局限。
  • 模型无法捕捉非正规移民(undocumented migration),这类移民本质上在官方统计中不可见。
  • 不确定性量化依赖于输入数据不确定性的估计,而某些目标数据(如UN DESA存量)的不确定性本身难以精确量化。

Key Contributions

  • 首次生成了1990–2023年全球230个国家和地区按出生国分类的年度双边移民流量数据集,将时间分辨率从五年提升至一年。
  • 将深度循环神经网络引入全球移民建模,通过“记忆”机制克服了传统引力模型的马尔可夫假设局限。
  • 建立了多源数据整合框架,将官方统计、人口普查存量、净移民估计和数字痕迹数据统一到单一建模框架中。
  • 提供了完整的不确定性量化,能够识别数据最不一致、最需要改进收集的国家和地区。
  • 修正了联合国WPP净移民估计中的若干偏差(如俄罗斯、越南案例),为全球移民监测提供了更可靠的替代方案。
  • 揭示了此前被五年期数据掩盖的移民动态,包括中东劳工移民的规模、撒哈拉以南非洲冲突迁移的年度变化等。
  • 公开发布所有数据、代码和训练模型,为后续研究和预测提供了透明、可复现的基础。

Key Claims

"Here we present a new dataset of annual origin-destination migration across 230 countries and regions from 1990 to the present, integrating diverse data sources into a unified modelling framework." (Abstract)

"Our results outperform existing five-year flow estimates on held-out data and provide finer temporal resolution, revealing previously obscured dynamics in global migration patterns." (Abstract)

"The fundamental problem when modelling migration as log(T_bij(t)) = f(χ_bij(t)) is that it represents humans as Markovian, acting only on the basis of the current state of the world with no regard to the past." (Introduction)

"Our estimates reveal that, since 2000, global migration movements have risen from 13 million people annually to around 35 million in 2023." (A global map of migration)

"The pronounced regional heterogeneity in uncertainty highlights the importance of improving data collection in under-resourced settings as a prerequisite for more precise migration estimates." (Meaningful uncertainty quantification)


My Notes